The following notebook recieved a score of 0.4 because of the reasons listed below.
import pandas as pd
import numpy as np
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression
from sklearn.linear_model import LogisticRegression
from sklearn.tree import DecisionTreeClassifier
from sklearn.neighbors import KNeighborsClassifier
from sklearn.metrics import mean_squared_error
kc_df = pd.DataFrame()
kc_df = pd.read_csv('https://raw.githubusercontent.com/javed24/House-Sales-Prediction/master/dataset/kc_house_data.csv')
print(kc_df.shape)
print(kc_df[:2])
list(kc_df.columns.values)
features = ['bedrooms','bathrooms','sqft_living','sqft_lot','floors','waterfront','view','condition','grade','sqft_above','sqft_basement','yr_built']
#features = list(kc_df.columns.values)
feature_matrix = kc_df[features]
lable_vector = kc_df['price']
feature_matrix.head()
X_train, X_test, y_train, y_test = train_test_split(feature_matrix, lable_vector, test_size=0.3, random_state=3)
# Initialize classifiers
#my_logreg = LogisticRegression()
my_linear = LinearRegression()
#my_decisiontree = DecisionTreeClassifier()
#k = 5
#knn = KNeighborsClassifier(n_neighbors=k)
#knn.fit(X_train, y_train)
#my_decisiontree.fit(X_train, y_train)
#my_logreg.fit(X_train, y_train)
my_linear.fit(X_train, y_train)
# printing Theta0 using attribute "intercept_":
print(my_linear.intercept_)
# printing [Theta1, Theta2, Theta3] using attribute "coef_":
print(my_linear.coef_)
coef_list = my_linear.coef_
coef_list.sort()
print(coef_list)
#predict testing data
#y_predict_knn = knn.predict(X_test)
#y_predict_dt = my_decisiontree.predict(X_test)
#y_predict_lr = my_logreg.predict(X_test)
y_predict_ln = my_linear.predict(X_test)
print(y_predict_ln)
#print(y_predict_lr)
#print(y_predict_dt)
#print(y_predict_knn)
# from sklearn.metrics import accuracy_score
# score_lr = accuracy_score(y_test, y_predict_lr.argmax(axis=1))
# #score_dt = accuracy_score(y_test, y_predict_dt)
# #score_knn = accuracy_score(y_test, y_predict_knn)
# print("Logistic Regression:>>> ",score_lr)
# #print("Decision Tree>> ",score_dt)
# #print("KNN>>>> ",score_knn)
error = mean_squared_error(y_test, y_predict_ln)
print(error)
root_mean_square_error = np.sqrt(error)
print(root_mean_square_error)